Retrieval-Augmented Claude Opus 4.7 and GPT-5.5 Surpass Human Performance on the Nuclear Cardiology Board Preparation Exam (and Claude Drafts a Paper About it)
Nächste Generationen großer Sprachmodelle, insbesondere Claude Opus 4.7 und GPT-5.5, ausgestattet mit retrieval-augmentierter Generierung unter Verwendung domänenspezifischer Ressourcen der Nuklearcardiologie, erreichten auf der ASNC-Prüfung zur Vorbereitung auf die Facharztanerkennung eine durchschnittliche Genauigkeit von etwa 86 %, wodurch sowohl die geschätzte Bestehensschwelle als auch die durchschnittliche Leistung von Human-Fellows in der Weiterbildung übertroffen wurden.